原始笔记

Data Wrangling(整理版) - 大纲

  1. Data Wrangling(整理版)
  2. 内容简要概括
  3. 目录
  4. 1. grep、sed、awk 常用方式与参数速查
  5. 1.1 grep: 按行过滤文本
  6. 找出 sshd 相关日志
  7. 找出包含 Disconnected from 的 sshd 日志
  8. 排除某类 nightly toolchain
  9. 1.2 sed: 流式替换、删除与抽取
  10. 1.3 awk: 按字段处理文本流
  11. 2. Data Wrangling 的基本思路
  12. 3. 从远程 SSH 日志开始过滤
  13. 3.1 在本地过滤远程日志
  14. 3.2 在远程先过滤,再传回本地
  15. 3.3 保存过滤结果,方便本地调试
  16. 4. sed 与 regular expression
  17. 4.1 删除固定前缀
  18. 4.2 常见 regular expression 元字符
  19. 4.3 贪婪匹配与 perl 的非贪婪写法
  20. 4.4 匹配整行并删除整行内容
  21. 4.5 使用捕获组提取用户名
  22. 5. 提取用户名并统计频次
  23. 5.1 sort 与 uniq -c
  24. 5.2 按次数排序并取前 10 个
  25. 5.3 生成逗号分隔的用户名列表
  26. 6. awk 处理字段与条件
  27. 6.1 打印指定字段
  28. 6.2 使用 pattern 过滤行
  29. 6.3 使用 BEGIN 和 END 做累计
  30. 7. Data Wrangling to Make Arguments
  31. 8. Wrangling Binary Data
  32. 9. 可复用命令模板汇总
  33. 9.1 远程过滤日志并本地查看
  34. 9.2 保存远程过滤结果
  35. 9.3 从 SSH 日志提取用户名
  36. 9.4 统计出现最多的 10 个用户名
  37. 9.5 输出逗号分隔的用户名列表
  38. 9.6 用 xargs 把整理结果变成命令参数

Switch to English